Postmortem 文化
概述
Postmortem(事后回顾/事故复盘)是软件工程中将生产故障转化为学习机会的核心实践,通过系统性分析事故根因推动系统级改进,而非追究个人责任。
关键内容
-
核心理念:Postmortem 的目标是将故障转化为学习机会,强调系统性分析而非个人追责。对于 AI 系统,Postmortem 面临额外挑战:不确定性更高(概率性失败)、可重现性差、涌现行为导致难以预测的失败模式。
-
AI 系统的特殊挑战:传统软件的 Postmortem 已有成熟方法论,但 AI 系统引入了新的复杂性。LLM 的行为是概率性的,同样的输入可能产生不同输出;系统级别的交互会产生涌现行为,导致失败模式难以预测;很多 AI 失败难以在隔离环境中完全复现。
-
事故响应双轨制:所有事故响应都面临快速止血与根本原因修复的权衡。快速止血包括回滚到稳定版本、流量降级、临时绕过问题代码路径;根本原因修复需要更多时间、可能需重新设计、必须有测试覆盖。最佳实践是先快速止血,再深入根因分析,绝不在未理解根因的情况下声称问题已解决。
-
AI 系统特有的响应手段:包括模型级回退(回退到上一个模型版本)、Prompt 级回退(回退到上一版本提示)、流量级调整(将特定类型请求路由到备用路径)。这些手段是传统 SRE 实践中没有的。
-
从事故到系统改进:好的 Postmortem 不只是记录"发生了什么",而是推动普适改进:将失败案例加入评测套件防止复发、改进部署流水线增加金丝雀发布阶段、加强生产监控添加特定行为质量指标。
-
透明文化的工程价值:公开 Postmortem 产生多重价值——内部信号(不能掩盖失败)、外部信任(展示如何处理问题比声称"不会出问题"更有说服力)、行业学习、用户沟通。这需要勇气,因为公开承认失败在商业上有成本。
来源
- 18_postmortem.md — Anthropic Engineering Blog 原文《A postmortem of three recent issues》